Agent 训练环境是 agentic RL 训练时给模型「练手」的那台机器。它不吃 GPU,但几千张 GPU 有没有活干,取决于它能不能按需、快速、可重置地供给出几万个隔离环境。
先约定几个词,本专题全程使用:
| 词 | 意思 |
|---|
| RL(强化学习) | 让模型通过「试—打分—调整」学习的训练方式。没有标准答案,只有一个给行为打分的函数 |
| rollout | 一次完整的「让模型去试一遍」。模型在环境里连续动作若干步直到结束,产出一条轨迹 |
| 环境 | 接收动作、返回观察和奖励的那个东西。对 Agent 来说通常就是一台装好工具的 Linux 机器 |
| reset | 把环境恢复到初始状态,好让下一次 rollout 从同一个起点开始。这是训练环境区别于运行时沙箱最核心的一条 |
| 可验证奖励(RLVR) | 由程序自动判定的奖励,比如「测试跑没跑过」。它是编码任务成为 agentic RL 主战场的原因 |
| 快照与 fork | 把初始状态固化下来,每条 rollout 从它分叉出一个独立副本。这是 reset 的高效实现方式 |
| harness(脚手架) | 真正驱动模型干活的那个程序,比如 Claude Code、Codex。训练时用的和上线时用的是不是同一份,直接决定训练效果能不能复现 |
一、这一层要解决的问题
把这四条当成检查表:评估任何一个环境方案时,逐条问它做到了哪一步、代价是什么。
二、五篇正文
| # | 标题 | 回答的问题 |
|---|
| 01 | 训练环境为什么不是运行时沙箱 | 生产上已经有沙箱了,为什么还要另做一套?差在哪、差多少 |
| 02 | AgentENV 拆解 | 一个支撑 150 万镜像、冷启动 50 毫秒的实现内部长什么样 |
| 03 | 环境接口标准 | 训练框架和环境用什么接口对话?三套方案划在了哪里 |
| 04 | 训练框架怎么接环境 | 谁负责把几万个环境拉起来?六个训练框架的选择 |
| 05 | 任务环境与选型 | 用什么任务训?评测基准能不能直接拿来用 |
三、拆解对象
3.1 环境平台
3.2 环境接口标准
3.3 训练框架
3.4 任务环境与基准
代码与终端类以 SWE-bench(★5,669)与 harbor(★4,426)为主,操作系统与浏览器类看 OSWorld(★3,099)与 BrowserGym(★1,325),工具使用类看 AgentBench(★3,675)与 tau-bench(★1,393)。完整对照与停更情况见 05 篇。
四、与其他专题的关系
← 回到 Agent Infra 板块总览